CXL 内存扩展在 AI 训练中的实践:梯度检查点、优化器状态与生产部署 深入剖析 CXL (Compute Express Link) 内存在 AI 训练工作负载中的架构设计与工程实践,涵盖 ZeRO-Infinity offload 策略、PyTorch 自定义 CXL 分配器、性能基准测试以及与 HBM/NVMe 的层级对比。 服务器运维 2026年10月01日 0 点赞 0 评论 46 浏览
eBPF 赋能 AI 训练工作负载的自动化调优:从内核可观测到闭环控制 深入探讨如何基于 eBPF 构建 AI 训练工作负载的自动化调优系统,涵盖内核探测点选择、低开销数据采集、实时决策引擎和闭环控制策略的完整工程实践,包含ImageNet训练A/B测试实录。 eBPF入门 2026年10月07日 0 点赞 0 评论 32 浏览